ECCV 2026 | AgentVLN:让机器人导航进入Agent时代
ECCV 2026 | AgentVLN:让机器人导航进入Agent时代近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
搜索
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
一周之内大语言、图片、视频模型都迎来新赛季:OpenAI的GPT-6 Astra让编码 Agent更好地使用游戏引擎和Blender,自己改场景、自己跑、自己测;GPT-image-2.5上线,更快更强,图片编辑和关键帧动画显著提升;fal和Yoroll分别发布 H3 MaxTurbo和H3 Superfast后训练加速模型,5秒视频3秒内推理,实时生成和互动玩法纷纷涌现。
崔添翼最近在 X 上刷屏有点多。9 月 9 日,这位今年 3 月加入 DeepSeek、负责 Agent 运行和评估基础设施的 Harness 团队成员发推称,V4.1 Flash 在性能、费用、速度和总用时等方面全面超过 V4 Pro,因此 V4.1 Flash 上线后、V4.1 Pro 上线前,所有发往 V4 Pro 的请求都会被路由到 V4.1 Flash,按 Flash 的价格计费。
数宗科技创始人丁天(南京大学00后)创立AI Agent公司,开发企业级产品Brand Master,通过虚拟消费者模拟帮助品牌在新品上市前完成全生命周期测试,将新品研发周期从2个月缩短至1周,营销ROI平均提升80%,已服务雅诗兰黛、盒马、7-Eleven等客户。
具身智能初创公司费莫一科技(PHYMI)已完成近亿美元种子轮融资,由IDG资本领投,资金将主要用于Physical Agent核心技术研发、真实动态数据体系建设、产品工程化与场景落地以及团队扩充。
刚刚,OpenAI 发文投下一颗重磅新闻,称他们使用一种比 GPT-6 Astra 更强大的、未公开的下一代前沿大模型,联合约 10000 个并发协作的 AI Agent,仅耗时 88 个小时,便攻克了克雷数学研究所设立的七大千禧年难题之一 —— 纳维 - 斯托克斯方程(Navier-Stokes Equation)的存在性与光滑性问题。
办公 Agent 下半年开启了大乱战模式。
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
过去一段时间,TiDB 团队启动了一项面向 Agent 的基础设施尝试——TiDB Cloud Filesystem。它把 Workspace 从 Session 和 Sandbox 的生命周期中独立出来:Agent 仍然通过熟悉的文件系统接口工作,背后则提供数据库级的持久化、版本、分支、回滚和权限控制。
OpenAI发文宣布其"自动化AI研究实习生"已于2026年9月正式部署,并首次披露内部数据显示AI Agent工时已达人类研究员的3.1倍,黄仁勋同日公开表示AGI已经到来。